Type: entity
Confidence: 0.90
Created: 2026-04-20
Updated: 2026-04-25
Tags: paperdeep-learningbackpropagationneural-networks机器学习

Learning Representations by Back-propagating Errors (1986 论文)

概述

反向传播算法的经典论文,系统化描述了如何通过链式法则训练多层神经网络,引发深度学习复兴。该论文在Nature期刊发表,证明了多层网络能自动学习有意义的内部表示。

关键内容

  1. 算法描述:清晰展示了误差从输出层向输入层逐层传播的数学过程,使多层网络训练成为可能。通过链式法则将最终的预测错误合理分配给网络中每一个权重。

  2. 链式法则应用:将微积分中的 链式法则 应用于神经网络梯度计算,奠定了现代深度学习框架的核心算法。公式:∂L/∂W^(1) = ∂L/∂ŷ · ∂ŷ/∂h^(2) · ∂h^(2)/∂h^(1) · ∂h^(1)/∂W^(1)

  3. 历史意义:该论文被视为深度学习复兴的关键文献,解决了困扰AI领域十余年的"信用分配问题"。直接催生了 多层感知机 的实用化和后续 卷积神经网络(CNN) 的发展。

  4. XOR问题解决:论文演示了如何用两层网络配合反向传播解决XOR问题,这曾是单层感知机无法解决的经典案例。网络在训练后能够正确预测所有四种输入组合。

  5. 家族关系学习实验:论文中最具启发性的实验之一——让网络学习家族关系,结果网络在隐藏层自动形成了"国籍"、"辈分"等抽象概念,证明了神经网络能学到有意义的内部表示。

  6. Sigmoid激活函数:1986年论文选用Sigmoid函数作为激活函数,因其处处可导便于梯度计算,但这也为后来的梯度消失问题埋下了伏笔。

来源

相关